Я пытаюсь прочитать документ Word с веб-адреса, используя POI версии 3.6. Нерабочий код:
String url = "http://prevention.cancer.gov/sites/default/files/uploads/clinical_trial/Master-DMP-Template.doc";
InputStream inputStream = new URL(urlString).openStream();
HWPFDocument doc = new HWPFDocument(inputStream);
WordExtractor extractor = new WordExtractor(doc);
String text = extractor.getText();
Приведенный выше код приводит к java.io.IOException: невозможно прочитать весь заголовок; Прочитано 6 байт; ожидается 32 байта
Попытка 2: интересная часть заключается в том, что загрузка файла (просто вставка URL в адресную строку браузера), а затем выполнение аналогичного кода для локального чтения документа работает:
InputStream inputStream = new FileInputStream("C:\\Users\\me\\Downloads\\Master-DMP-Template (2).doc");
HWPFDocument doc = new HWPFDocument(inputStream);
WordExtractor extractor = new WordExtractor(doc);
System.out.println(extractor.getText());
Попытка 3: и теперь самая странная часть. Я думал, что файл должен быть загружен в первую очередь. Поэтому я сначала загрузил его, используя Java, а затем выполнил предыдущий код для локального чтения документа. Не получается, как в первом случае!
final String url = "http://prevention.cancer.gov/sites/default/files/uploads/clinical_trial/Master-DMP-Template.doc";
String localPath = FileUtils.downloadFile("C:\\Users\\me\\Downloads", url);
InputStream inputStream = new FileInputStream(localPath);
HWPFDocument doc = new HWPFDocument(inputStream);
WordExtractor extractor = new WordExtractor(doc);
System.out.println(extractor.getText());
public static String downloadFile(String targetDir, String sourceUrl) throws IOException {
sourceUrl = StringUtils.removeEnd(sourceUrl, "/");
String fileName = sourceUrl.substring(sourceUrl.lastIndexOf("/") + 1);
String targetPath = targetDir + FileUtils.SEPARATOR + fileName;
InputStream in = new URL(sourceUrl).openStream();
Files.copy(in, Paths.get(targetPath), StandardCopyOption.REPLACE_EXISTING);
System.out.println("Downloaded " + sourceUrl + " to " + targetPath);
return targetPath;
}
Есть идеи, что здесь происходит?
Обновление: я создал отдельный проект для попытки с POI 4.1.0. Тот же код (с первой попытки) приводит к появлению org.apache.poi.EmptyFileException: предоставленный файл был пустым (длина нулевого байта)
Я попытался вставить URL в браузер после нажатия клавиши F12 и просмотра вкладки «Сеть». Сообщение, которое появляется там:
Ресурс интерпретирован как Документ, но передан с приложением MIME-типа / msword: "https://prevention.cancer.gov/sites/default/files/uploads/clinical_trial/Master-DMP-Template.doc".
Я все еще застрял ...
Обновление: как указано https://stackoverflow.com/users/3915431/axel-richter, существует перенаправление 301 на https://prevention.cancer.gov/sites/default/files/uploads/clinical_trial/Master-DMP-Template.doc. Однако сейчас я сталкиваюсь со странными проблемами, не связанными с Word. Код подписки не работает:
public static void main(String[] args) {
try {
if (args.length > 0 && args[0].equals("disableCertValidation")) {
SSLUtil.disableCertificateValidation(); // redirect is https
}
final String stringURL = "https://prevention.cancer.gov/sites/default/files/uploads/clinical_trial/Master-DMP-Template.doc";
URL url = new URL(stringURL);
HttpURLConnection con = (HttpURLConnection) url.openConnection();
int responseCode = con.getResponseCode();
System.out.println("Response code: " + responseCode); //301 Moved Permanently
InputStream in = con.getInputStream();
HWPFDocument doc = new HWPFDocument(in);
WordExtractor extractor = new WordExtractor(doc);
String text = extractor.getText();
System.out.println(text);
in.close();
} catch (IOException e) {
e.printStackTrace();
}
}
При запуске main без аргумента строка
int responseCode = con.getResponseCode();
терпит неудачу со следующим исключением:
javax.net.ssl.SSLHandshakeException: sun.security.validator.ValidatorException: сбой построения пути PKIX: sun.security.provider.certpath.SunCertPathBuilderException: невозможно найти действительный путь сертификации для запрошенной цели
При выполнении кода с аргументом disableCertificateValidation код ответа - 404, и я получаю следующее исключение:
java.io.FileNotFoundException: https://prevention.cancer.gov/sites/default/files/uploads/clinical_trial/Master-DMP-Template.doc
at sun.reflect.NativeConstructorAccessorImpl.newInstance0 (собственный метод)
at sun.reflect.NativeConstructorAccessorImpl.newInstance (NativeConstructorAccessorImpl.java:62)
at sun.reflect.DelegatingConstructorAccessorImpl.newInstance (DelegatingConstructorAccessorImpl.java:45)
в java.lang.reflect.Constructor.newInstance (Constructor.java:422)
на sun.net.www.protocol.http.HttpURLConnection $ 10.run (HttpURLConnection.java:1890)
на sun.net.www.protocol.http.HttpURLConnection $ 10.run (HttpURLConnection.java:1885)
at java.security.AccessController.doPrivileged (собственный метод)
на sun.net.www.protocol.http.HttpURLConnection.getChainedException (HttpURLConnection.java:1884)
на sun.net.www.protocol.http.HttpURLConnection.getInputStream0 (HttpURLConnection.java:1457)
на sun.net.www.protocol.http.HttpURLConnection.getInputStream (HttpURLConnection.java:1441)
на sun.net.www.protocol.https.HttpsURLConnectionImpl.getInputStream (HttpsURLConnectionImpl.java:254)
в com.keywords.control.util.TestHTMLParser.main (TestHTMLParser.java:472)
Вызывается: java.io.FileNotFoundException: https://prevention.cancer.gov/sites/default/files/uploads/clinical_trial/Master-DMP-Template.doc
на sun.net.www.protocol.http.HttpURLConnection.getInputStream0 (HttpURLConnection.java:1836)
на sun.net.www.protocol.http.HttpURLConnection.getInputStream (HttpURLConnection.java:1441)
в java.net.HttpURLConnection.getResponseCode (HttpURLConnection.java:480)
на sun.net.www.protocol.https.HttpsURLConnectionImpl.getResponseCode (HttpsURLConnectionImpl.java:338)
в com.keywords.control.util.TestHTMLParser.main (TestHTMLParser.java:470)
Есть идеи?