クイックスタート
CLI クイックスタート
テキストの分割
Litsea には models/ ディレクトリに学習済みモデルが同梱されています。テキストを segment コマンドにパイプで渡します:
日本語(同梱の RWCP.model、オリジナルの TinySegmenter モデルを使用):
echo "LitseaはTinySegmenterを参考に開発された、Rustで実装された極めてコンパクトな単語分割ソフトウェアです。" \
| litsea segment -l japanese ./models/RWCP.model
出力:
Litsea は TinySegmenter を 参考 に 開発 さ れ た 、Rust で 実装 さ れ た 極めて コンパクト な 単語 分割 ソフトウェア です 。
中国語:
echo "中文分词测试。" | litsea segment -l chinese ./models/chinese.model
韓国語:
echo "한국어 단어 분할 테스트입니다." | litsea segment -l korean ./models/korean.model
英語:
echo "I don't know." | litsea segment -l english ./models/english.model
品詞推定付き分割
Litsea は二段構成モデルを使って、単語分割と品詞推定を行うことができます。segment コマンドに --pos フラグを追加します:
echo "今日はいい天気ですね。" \
| litsea segment --pos -l japanese ./models/japanese_pos.model
出力:
今日/NOUN は/ADP いい/ADJ 天気/NOUN です/AUX ね/PART 。/PUNCT
各トークンには Universal POS(UPOS) タグが付与されます。
ライブラリ クイックスタート
モデルを読み込みテキストを分割する最小限の Rust プログラムです:
use std::path::Path;
use litsea::adaboost::AdaBoost;
use litsea::language::Language;
use litsea::segmenter::Segmenter;
fn main() -> litsea::Result<()> {
// Load the pre-trained model
let mut learner = AdaBoost::new(0.01, 100);
learner.load_model_from_path(Path::new("./models/RWCP.model"))?;
// Create a segmenter
let segmenter = Segmenter::with_learner(Language::Japanese, learner);
// Segment text
let tokens = segmenter.segment("これはテストです。");
println!("{}", tokens.join(" "));
// Output: これ は テスト です 。
Ok(())
}
ライブラリでの品詞推定付き分割
POS モデルを読み込み、品詞タグ付きでテキストを分割する最小限の Rust プログラムです:
use std::path::Path;
use litsea::language::Language;
use litsea::segmenter::Segmenter;
use litsea::two_stage::TwoStageLearner;
fn main() -> litsea::Result<()> {
// Load the pre-trained two-stage POS model
let mut learner = TwoStageLearner::new();
learner.load_model_from_path(Path::new("./models/japanese_pos.model"))?;
// Create a segmenter with POS support
let segmenter = Segmenter::with_two_stage_learner(Language::Japanese, learner);
// Segment text with POS tags
let tokens = segmenter.segment_with_pos("今日はいい天気ですね。")?;
for (word, pos) in &tokens {
print!("{}/{} ", word, pos);
}
// Output: 今日/NOUN は/ADP いい/ADJ 天気/NOUN です/AUX ね/PART 。/PUNCT
Ok(())
}
次のステップ
- CLI リファレンス – すべての CLI コマンドとオプションの詳細
- 学習ガイド – 独自モデルの学習方法
- アーキテクチャ – Litsea の内部動作の理解