使用 Java 从文本文件中提取所有单词

本文旨在解决使用 StringTokenizer 读取文本文件时跳过第一行的问题,并提供一种更现代、更强大的方法来从文本文件中提取所有单词。我们将探讨如何使用 BufferedReader 和 BreakIterator 类,结合 Java 8 的 Stream API,高效地实现这一目标,并提供详细的代码示例和注意事项。

在使用 BufferedReader 读取文件时,如果发现第一行被跳过,通常是因为在循环开始前已经调用了一次 reader.readLine() 方法。例如,以下代码片段:

BufferedReader reader = new BufferedReader(new FileReader("C://Java-projects//EsameJava//prova.txt"));
String line = reader.readLine(); // 第一次读取
List str = new ArrayList<>();

while ((line = reader.readLine()) != null) { // 从第二次读取开始
    StringTokenizer token = new StringTokenizer(line); 

    while (token.hasMoreTokens()) {
        str.add(token.nextToken());
    }
}

这段代码在进入 while 循环之前,已经使用 reader.readLine() 读取了文件的第一行,并将结果存储在 line 变量中,但并未对其进行处理,导致第一行被忽略。

要解决这个问题,一种简单的方法是移除循环前的 reader.readLine() 调用。但是,StringTokenizer 本身在处理复杂的文本时存在一些局限性,例如难以处理标点符号和多种语言的单词分割。

因此,更推荐使用 BreakIterator 类来更准确地提取单词,并结合 Java 8 的 Stream API 来简化代码:

import java.text.BreakIterator;
import java.util.ArrayList;
import java.util.List;
import java.util.stream.Stream;
import java.nio.file.Files;
import java.nio.file.Paths;
import java.io.IOException;

public class WordCollector {

    public static void main(String[] args) {
        try {
            List words = WordCollector.getWords(Files.lines(Paths.get(args[0])));
            System.out.println(words);
        } catch (IOException e) {
            e.printStackTrace();
        }
    }

    public static List getWords(Stream lines) {
        List result = new ArrayList<>();
        BreakIterator boundary = BreakIterator.getWordInstance();
        lines.forEach(line -> {
            boundary.setText(line);

            int start = boundary.first();
            for (int end = boundary.next(); end != BreakIterator.DONE; start = end, end = boundary.next()) {
                String candidate = line.substring(start, end).replaceAll("\\p{Punct}", "").trim();
                if (candidate.length() > 0) {
                    result.add(candidate);
                }
            }
        });
        return result;
    }
}

代码解释:

  1. 导入必要的类: 导入 BreakIterator, ArrayList, List, Stream, Files, Paths 和 IOException。
  2. main 方法: 接收文件路径作为命令行参数,使用 Files.lines() 读取文件内容,然后调用 getWords() 方法提取单词,最后打印结果。 使用 try-catch 块处理 IOException。
  3. getWords 方法:
    • 创建一个 ArrayList 来存储提取的单词。
    • 使用 BreakIterator.getWordInstance() 获取一个用于单词分割的 BreakIterator 实例。
    • 使用 lines.forEach() 遍历文件的每一行。
    • 对于每一行,使用 boundary.setText(line) 设置 BreakIterator 的文本。
    • 使用 boundary.first

      () 获取第一个单词的起始位置。
    • 使用一个循环来迭代所有单词,循环条件是 end != BreakIterator.DONE。
    • 在循环中,使用 line.substring(start, end) 提取单词。
    • 使用 replaceAll("\\p{Punct}", "") 移除标点符号。
    • 使用 trim() 移除首尾空格。
    • 如果提取的单词长度大于 0,则将其添加到 result 列表中。
    • 最后,返回 result 列表。

使用方法:

  1. 将代码保存为 WordCollector.java。
  2. 使用 javac WordCollector.java 编译代码。
  3. 使用 java WordCollector 运行代码,其中 是要读取的文本文件的路径。

注意事项:

  • 确保文件路径正确。
  • BreakIterator 类可以处理多种语言的单词分割,但可能需要根据具体情况进行配置。
  • replaceAll("\\p{Punct}", "") 用于移除所有标点符号。如果需要保留某些标点符号,可以修改正则表达式。
  • 此方法使用了 Java 8 的 Stream API,需要 Java 8 或更高版本才能运行。

总结:

通过使用 BreakIterator 类和 Java 8 的 Stream API,我们可以更有效地从文本文件中提取单词,并避免 StringTokenizer 的一些局限性。 这种方法更灵活、更强大,并且可以更好地处理复杂的文本数据。 同时也解决了BufferedReader读取文件时跳过第一行的问题。