{"as_of":"2026-08-16T23:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:290b7ca056d338e29f3c16504119928c51a7b66df1049304c07a8d734bfbf7c9","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T15:09:37.464178Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.02726/citation-record","integrity":"/paper/1908.02726/integrity","json":"/paper/1908.02726/citation-record.json","paper":"/paper/1908.02726"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.282049Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.282049Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:a8f9718022044fe4501dbf8e0b48caf3ddd32f8739b837d3c19d2cf731d090d5","observation_id":"8081c4c4-6936-483d-b539-009f0292bf32","resolution":{"observed_at":"2026-08-14T15:09:37.282049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:38.056578Z","title":"Densecap: Fully convolutional localization networks for dense captioning,","venue":null,"work_id":"076981ee-c766-4085-b368-3e58105188fb","year":2016},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.287763Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:0722a41c9aad6203213e55391af1732b05e65ace7a24fb55d4d9cf7a254100af","observation_id":"e43d0c01-1ffc-4d2c-abf7-65cffadd51f5","resolution":{"observed_at":"2026-08-14T15:09:38.061132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:38.043691Z","title":"Show, observe and tell: Attribute-driven attention model for image captioning,","venue":null,"work_id":"24a21ecd-38c4-4425-8551-81c0b318e44e","year":2018},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.292480Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:002712f516da3ee59435b3d1a157c5f02a4465e1ef884e9ca2bc8706834889e3","observation_id":"fb9b721e-84dd-42a5-8335-a8f3dd8e7e93","resolution":{"observed_at":"2026-08-14T15:09:38.047638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:38.028743Z","title":"Show and tell more: Topic- oriented multi-sentence image captioning,","venue":null,"work_id":"faa83e36-baad-4c82-8d68-0c2d916a57fb","year":2018},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.297026Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:5e17fb071ded0bcc14fa34cef052411f7e1b8301d0b565e252894f89519f10df","observation_id":"76226725-bc70-4cd0-a1a5-17c1d5b71c6b","resolution":{"observed_at":"2026-08-14T15:09:38.033784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:38.014885Z","title":"Bottom-up and top-down attention for image captioning and VQA,","venue":null,"work_id":"180c88c5-d559-4bed-b797-109da98a5680","year":2018},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.301471Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:0c36ebb9bc657b31113006a048ffadfc2b641013f63b5fc78fe21007a8ebe73b","observation_id":"30a1c0f1-3326-43e8-bf81-a98c65fa74ef","resolution":{"observed_at":"2026-08-14T15:09:38.019520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.998912Z","title":"Video-based human behavior understanding: A survey,","venue":null,"work_id":"f0d6eb0a-f067-4400-874c-67a183d2b800","year":2013},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.305719Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:f87f539d7d0dba8035c993b4478453cf02342844c5ee4df5d9af5874dfb8a2d3","observation_id":"58974825-b3a3-445f-aea0-8d2a97dedd8e","resolution":{"observed_at":"2026-08-14T15:09:38.004345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.982846Z","title":"Histograms of optical ﬂow orientation and magnitude and entropy to detect anomalous events in videos,","venue":null,"work_id":"e29e7689-8cde-438b-9f30-d37a8999fbe9","year":2017},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.311898Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:488c1da013ea2563345e31b63d2cf5a6e813d095d9282fcc626f59990d01961f","observation_id":"2e8e6741-8f46-488a-9478-ee0fd40a8226","resolution":{"observed_at":"2026-08-14T15:09:37.988190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.968233Z","title":"T-cnn: Tubelets with convolutional neural networks for object detection from videos,","venue":null,"work_id":"f116c10c-0ddf-4f94-8492-4c6720130715","year":2018},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.317267Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:71818222d55438dd37fb9689fafefe7915880734a78cd14e9b55f4a844836551","observation_id":"75d56f35-b4a8-451c-bbad-1b4fc530e70f","resolution":{"observed_at":"2026-08-14T15:09:37.972442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.954792Z","title":"Deep compositional captioning: Describing novel object categories without paired training data,","venue":null,"work_id":"1ff2b0ad-ba96-42a1-83c4-eea9080b0fb3","year":2016},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.321897Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:de9d1d8e517aada14f976a19fb49ba5c8100e78fa169ef12903395ebc1df7e7d","observation_id":"73f23337-7955-4a5c-b8b8-6452948f81b4","resolution":{"observed_at":"2026-08-14T15:09:37.959106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.940503Z","title":"Neural baby talk,","venue":null,"work_id":"de525bb0-6974-4782-9f7e-017479cb1402","year":2018},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.326492Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:49f12efb307f66af3ad306f2a7220194808dfd399bf2b4bd57c470c89457b140","observation_id":"5cacfec7-b232-4d62-ac10-ad41d8cf0852","resolution":{"observed_at":"2026-08-14T15:09:37.944931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.925635Z","title":"Decoupled novel object captioner,","venue":null,"work_id":"64c9a4cd-7f5d-4e98-84df-77f82d059e89","year":2018},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.331021Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:6dbccf63bfad825d59a5c6bfc55a1ae806f8ccdc5e00713d6db88bce96dd7fce","observation_id":"f0329f73-3514-43e2-86dc-a5f2011b0b81","resolution":{"observed_at":"2026-08-14T15:09:37.930201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.910320Z","title":"Faster R-CNN: towards real-time object detection with region proposal networks,","venue":null,"work_id":"31f29e99-43e9-441f-bfa1-485574bf6247","year":2017},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.335288Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:f93e695b86e1517a26f7d8ca2f0db986299bedc4cd045c9c3ba2985318f130f3","observation_id":"1087fdd1-9e53-4207-b902-b2c53a622441","resolution":{"observed_at":"2026-08-14T15:09:37.915509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.340392Z","title":"ImageNet: A Large-Scale Hierarchical Image Database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.340392Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:d9e85581c3f8161e5d160f6c1091cf50b2070e7f89ed041d7a62eecd364e7257","observation_id":"08383dc0-e472-4146-8c97-a6840840cebd","resolution":{"observed_at":"2026-08-14T15:09:37.340392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.884974Z","title":"I2T: image parsing to text description,","venue":null,"work_id":"93e2b468-175b-4e64-a1d0-91df505f5e3d","year":2010},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.345556Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:16f1964a6f022e9e369b9459d985859bf5d804d6ef9ca48bf09aa82e9549cfd2","observation_id":"581da49b-b3e1-44ac-a955-e2c951a1a496","resolution":{"observed_at":"2026-08-14T15:09:37.890958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.869738Z","title":"Im2text: Describing images using 1 million captioned photographs,","venue":null,"work_id":"2ce47957-15c7-41aa-8348-a59c0b63e539","year":2011},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.350283Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:94e09375627435cf7a3d17dd2e5dffd1c84c5e70cfc9c5476f6cb645c6bee9fc","observation_id":"312e6251-4066-48d8-ac39-0842cad0c9d7","resolution":{"observed_at":"2026-08-14T15:09:37.874600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.854548Z","title":"Deep captioning with multimodal recurrent neural networks (m-rnn),","venue":null,"work_id":"106302fa-ed83-46f1-b19e-791fa600e28c","year":2015},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.354929Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:5452f2bda669e349d4d8a8106d924dddd6a7385567124ad976b12730e3035f71","observation_id":"bf80b461-2760-4bd4-8c23-70995c471483","resolution":{"observed_at":"2026-08-14T15:09:37.859539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.839777Z","title":"Deep visual-semantic alignments for generating image descriptions,","venue":null,"work_id":"e86c9f47-052a-4f77-88de-46e7050635aa","year":2015},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.360235Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:bca8ae7126bfcec5d3ed445fb10216e497a6934f56cd57043160b5cc965391fd","observation_id":"a0211280-f887-4626-8b41-ddd58a384cab","resolution":{"observed_at":"2026-08-14T15:09:37.845246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.810197Z","title":"Show, attend and tell: Neural image caption generation with visual attention,","venue":null,"work_id":"c0da8256-4818-4db1-b4df-2c966aa23719","year":2015},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.367893Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:724a0eb8b93afc5206bb5934af3975c0f9f7ff16602122091fea166556331f3f","observation_id":"86a2cfbd-f508-4622-827e-ab22ee98e5c6","resolution":{"observed_at":"2026-08-14T15:09:37.814908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.794749Z","title":"Learning like a child: Fast novel visual concept learning from sentence descriptions of images,","venue":null,"work_id":"42616261-594e-4a17-98cf-558d51b8aff2","year":2015},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.371709Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:d65240b7a4a339a512dbe11ad329e3e6dd61a68853aa14f9134327052c7d2cc8","observation_id":"b473dea0-34d9-4241-903f-18d7efdaeb42","resolution":{"observed_at":"2026-08-14T15:09:37.799622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.779255Z","title":"Image caption with global-local attention,","venue":null,"work_id":"39122d79-4b41-4ffb-9d6d-1b483ae27d72","year":2017},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.376466Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:b5ebdb453a35ce67468451bff5b8204845c1b304d2286f7f323466115e042c98","observation_id":"7ccaec3a-3786-43c4-8eba-29b1bb5e3864","resolution":{"observed_at":"2026-08-14T15:09:37.784023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.764086Z","title":"Text-guided attention model for image captioning,","venue":null,"work_id":"d60a523c-26a9-4774-bdbb-a3c9e5a85254","year":2017},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.380543Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:e2f5b45684bb0c7519ac362ab59278077a7b85218e8b58edfc14fee8309c0288","observation_id":"a6455719-e7d5-4fcb-b376-4906e80d7cf0","resolution":{"observed_at":"2026-08-14T15:09:37.769191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.749715Z","title":"Learning to compose topic-aware mixture of experts for zero-shot video captioning,","venue":null,"work_id":"ea8a664a-40f1-44bb-946e-1369c26525b6","year":2019},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.384565Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:f3a14bfee2c84a0fb4b8eca7adbd4283c98719a9832968485d89a65a5ac41c0a","observation_id":"cf3ce139-4159-486f-b437-2ddf9aef728e","resolution":{"observed_at":"2026-08-14T15:09:37.754015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.733001Z","title":"Toward abnormal trajectory and event detection in video surveillance,","venue":null,"work_id":"5cfd7f52-ccdf-4a86-98ee-c0643857c7f2","year":2017},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.389035Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:fcc4fa3ba49dcb73e3984c78be5c6131a944b72a723340a5dd4360f917c0f7d7","observation_id":"5e57ba52-6e49-4384-bbfe-90afea81459c","resolution":{"observed_at":"2026-08-14T15:09:37.738872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.717065Z","title":"Cascade recurrent neural network for image caption generation,","venue":null,"work_id":"3e89d8fd-7dfb-43e3-8eed-2216cf2e3685","year":2017},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.393001Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:74ca6b1d7fad02213db68d5c7a8f0167debedc2291e6d04f27468c06b41fc58b","observation_id":"c7af0ff8-f3c2-42a7-851c-c258f0fad9db","resolution":{"observed_at":"2026-08-14T15:09:37.721919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.396892Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.396892Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:cc7413b4d2743abb0a22205d071dc522832452303ea38a1462939a5982e31fdb","observation_id":"587afba8-9b28-45f8-81b2-53354eca54f5","resolution":{"observed_at":"2026-08-14T15:09:37.396892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.401045Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.401045Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:e439176754d86e4e374389d132ef1e25025fb476281668586788e96f59ad0ddc","observation_id":"f6d3b182-b26f-44e6-9a1d-e40ab8c339d8","resolution":{"observed_at":"2026-08-14T15:09:37.401045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.683636Z","title":"Long short-term memory,","venue":null,"work_id":"c42d20c5-f8f9-40cd-af17-ab5c9275dcf7","year":1997},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.405721Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:90a6853e72eb9d38148ef3710400f68baabcf871bed7f732ddb984a7e6dc4763","observation_id":"d99e8715-d43c-498b-86f5-74f29fdf9cee","resolution":{"observed_at":"2026-08-14T15:09:37.687917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.668170Z","title":"Learning phrase representations using RNN encoder-decoder for statistical machine translation,","venue":null,"work_id":"c118875e-bdf8-44d6-9e61-f99bcd41fb44","year":2014},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.411080Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:945773723740dc1ced006c1ed6f2d457e0df0e329821c3c5e6207f5bb24b302f","observation_id":"bfa80ffd-b9cf-46e0-a0bd-d9f0fe0f9521","resolution":{"observed_at":"2026-08-14T15:09:37.672969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.653618Z","title":"Attribute-based classi- ﬁcation for zero-shot visual object categorization,","venue":null,"work_id":"5ddeaacf-142c-4a72-9406-2f3a59976129","year":2014},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.415850Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:ade6dd858d5ecd6a3de7d2ff45fe2fe99c9ec6cf9af454e3f0b81098f92dc3e2","observation_id":"c6738495-52f7-4d6e-840d-591356e58b2f","resolution":{"observed_at":"2026-08-14T15:09:37.659118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.637396Z","title":"Zero-shot learning - A comprehensive evaluation of the good, the bad and the ugly,","venue":null,"work_id":"8cb969a9-771e-4131-a861-aa663fcb7815","year":2017},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.420546Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:959dea874894e12ffbc40d4287bf4123522aa8166dab983fc7f312bdbdbb4205","observation_id":"50d2e4da-85d5-491a-af93-1655b532a28b","resolution":{"observed_at":"2026-08-14T15:09:37.642994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.621889Z","title":"Low-rank embedded ensemble semantic dictionary for zero-shot learning,","venue":null,"work_id":"435bea84-8436-44ee-bc47-881445e51668","year":2017},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.425498Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:7cc8ada857a4c3abda54547ed07e17856e0b195754150ab417073c011bbbd2b5","observation_id":"7d78285e-3e66-4d55-9c0a-4a3ba826761d","resolution":{"observed_at":"2026-08-14T15:09:37.626598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.608013Z","title":"Devise: A deep visual- semantic embedding model,","venue":null,"work_id":"10f4ec75-79d5-4154-874d-aac53187d659","year":2013},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.431007Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:67596eea0e5c6ede72d7c304b60b71e8b87a4f986b8ed06a7fd1743d7c54bf4d","observation_id":"0e76dc43-0682-4357-b126-b74a862e16e7","resolution":{"observed_at":"2026-08-14T15:09:37.612264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.592585Z","title":"Microsoft COCO: common objects in context,","venue":null,"work_id":"d78c9c24-2050-440b-81e4-d0109db71662","year":2014},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.434809Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:01fce8f0112688c342d7da05821cf3eb5ea57f65c54cf353a62106ab4582311d","observation_id":"8559fb79-50fb-4585-83dd-10ca2032554d","resolution":{"observed_at":"2026-08-14T15:09:37.597708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.575128Z","title":"Captioning images with diverse objects,","venue":null,"work_id":"5650a37e-b79d-44b2-b1df-2a70fa82015a","year":2017},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.438635Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:9c0359161547a00fa1e8602be346c1290e46a0b091d41f00559e91ccee9d82be","observation_id":"c30c8fac-ea9f-46fd-a36c-92fc2aca1874","resolution":{"observed_at":"2026-08-14T15:09:37.580999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.559261Z","title":"Incorporating copying mechanism in image captioning for learning novel objects,","venue":null,"work_id":"6b16af67-4179-4c19-b217-37bb3f0a39b6","year":2017},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.442845Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:c9e06b70be368001eb04b1bd647d0b7ba4863ac725f19ce0d06a2e74202422e5","observation_id":"d8101852-9ca9-4fa8-89a9-cca14bab6c0c","resolution":{"observed_at":"2026-08-14T15:09:37.563748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.543778Z","title":"Guided open vocabulary image captioning with constrained beam search,","venue":null,"work_id":"df017f9a-8364-4e04-9331-f931496287a6","year":2017},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.447334Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:1e400cfd6bab8bce66d07f035e91ba80b60ae2c5d97ae11cd487134dc8b07733","observation_id":"44840d3c-5745-4455-b8d1-2f5b896433c8","resolution":{"observed_at":"2026-08-14T15:09:37.549434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.527957Z","title":"Speed/accuracy trade-offs for modern convolutional object detectors,","venue":null,"work_id":"1ffba305-0f96-4ce1-a681-ff755f3b1005","year":2016},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.451358Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:5b6d2da5dc9dcf7aa9cc8311b3b9160c97d3e0ebeb1ac87349037ec3679aa352","observation_id":"af478cd0-f598-474b-9716-6e55e23424ae","resolution":{"observed_at":"2026-08-14T15:09:37.532907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.824429Z","title":"Long-term recurrent convolutional networks for visual recognition and description,","venue":null,"work_id":"d112819c-086a-464e-870a-944cc4515359","year":2015},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.455368Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:fa517a7f03e799c0dc899e038ad0c8ece297a88f1c4c9a9442b8bcdd3dd78d06","observation_id":"7dd21351-b7b6-4827-924d-cc144fc3118f","resolution":{"observed_at":"2026-08-14T15:09:37.830089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.512420Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations,","venue":null,"work_id":"9a674637-ef17-447a-935b-0a7cdaef8a80","year":2016},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.459534Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:5f4472b023b31abcbc01c3fa9a85e9e7f1736f790ac1d3d52112a83825410eda","observation_id":"87094361-ddf0-4c20-a7bf-30b2df7968c2","resolution":{"observed_at":"2026-08-14T15:09:37.517507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:09:37.495604Z","title":"student in University of Technology Sydney, Australia","venue":null,"work_id":"402aae89-4578-445b-a183-cd35ccdc22eb","year":2015},"citing_paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-14T15:09:37.464178Z"},"links":{"citing_paper":"/paper/1908.02726"},"observation_digest":"sha256:94b89a38e73a9de68b10721f6b618ce58cfdaf8409a2473df5a2f705c91b117e","observation_id":"003bd712-a629-486d-80f4-f6d3e41cb6bd","resolution":{"observed_at":"2026-08-14T15:09:37.501965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.02726","last_updated":"2019-08-06T01:36:31Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-16T08:19:40.930895Z","submitted_at":"2019-08-06T01:36:31Z","title":"Cascaded Revision Network for Novel Object Captioning"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:1908.02726."}