Re:ゼロから始めるML生活

どちらかといえばエミリア派です

Python

新着順 人気順

RAGのお試しテストケース用データセット作成

RAGをやっていて精度検証用データセットの作成で困ったことはないですか? 精度評価用のデータセットなんて作成することだけでも超めんどくさそうじゃないですか? ということで、今回はこの簡易精度評価に使うデータセット作成をやってみようと思います。

【写経】簡単なCNNを書いてみた

前回までは基本的なニューラルネットワークを勉強していました。 tsunotsuno.hatenablog.com 急に難しいことはできないので、次はCNNをやってみたいと思います。 今回も参考にしたのはこちらです。 ゼロから作るDeep Learning ―Pythonで学ぶディープラーニン…

時系列クラスタリングってやつをやってみる

複数の時系列データがあるとき、これらを傾向に従ってクラスタリングしたくなることがあります。 そういった手法を、時系列クラスタリングと呼ぶらしいです。 ちょっと調べてみると、こちらの記事を見かけました。 時系列クラスタリングの研究サーベイ論文を…

ベイズ構造時系列モデルってやつをやってみる

時系列分析というと、SARIMAモデルや状態空間モデルなどがよく使われているかと思います。 私自身、これらのモデルについて一つの系列データについてモデルを適用したことはありますが、複数の系列データが影響するようなモデルについては扱ってきませんでし…

SHAPを使ってみた

先日こちらの記事を見かけました。 towardsdatascience.com 機械学習モデルの解釈についてあまり勉強したことがなく、いい機会だったので上記の記事を参考に勉強してみたので、今回はそのメモです。

Feature Storeってどんなもん?Feastを使ってみる

この記事はMLOps Advent Calendar 2023の23日目の記事です。 以前、Feature Storeに関する記事を書いていました。 www.nogawanogawa.com この記事を書いた当時は「Feature Storeってこんな感じかー」って思って終わってしまい、どんな感じに使うのかは触って…

MLFlowでLightGBMの学習結果をtrackingしてみる

結構前にMLFlowをいろいろ触ってみていたんですが、最近全然触っていなかったので色々見てみました。 www.nogawanogawa.com 前に自分が触っていたときよりだいぶ使いやすくなってたので、今回は最近の自分の用途に合わせて改めてMLFlowを使ってみます。

GiNZAを使って固有表現のマスキングをやってみる

最近GiNZAを使って固有表現抽出するという記事をよく見かける気がします。具体的には、この辺りの記事を見てました。 acro-engineer.hatenablog.com qiita.com www.ai-shift.jp ということで、なんだか面白そうで、自分でもやってみたのでそのメモです。

BERTScoreで文章の類似性を測定してみた

最近こんな記事を見かけました。 ai-scholar.tech 機械翻訳や機械要約のタスクでは、自然文を生成することになりますが、その際に生成された文がどれほど良いかについて評価する必要が出てきます。 ICLRで発表されたBERTScoreはこれを従来の評価指標より正し…

形態素解析器をいろいろ試す

日本語自然言語処理を行う際に、形態素解析をどうするかという問題はいつもつきまとってきます。 今回記事を書こうと思ったのは、Vaporettoなる形態素解析器を見かけたからです。 こちらに興味が湧いたのと、他の形態素解析器と比較してみたくなったので、や…

mlflowを使ってみた

最近こちらの記事を拝見しました。 ymym3412.hatenablog.com 読んでて、mlflowってなんじゃい??ってなったので、今回はmlflowの使い方を勉強してみたのでそのメモです。

Coding Agentを自作してみる

最近こちらの記事を見てました。 martinfowler.com 内容は独自にCoding Agentを作る話なんですが、興味深かったです。 自分は「オレオレCoding Agentを作ってやるぜ!!」とまでは思ってないんですが、話題のCoding Agent CLIについて、原始的なものでも作れ…

TensorBoardを使ってみた

今回はTensorFlowのライブラリに付属しているTensorBoardなるものを使って色々可視化してみたいと思います。 参考にさせていただいたのはこちらです。 deepage.net TensorBoard 使い方 手順 具体例 1. プログラム中に可視化用のコードを追加 2. 普通にプログ…

【写経】TesnorFlowを使ったGANの実装

最近は年度末が近づいたのもあって、なかなかブログを更新できていませんでしたが、少しずつ書いていきます。 前回は雑でもなんでもGANの仕組みを理解しようということで、numpyだけでGANを書いていました。 まともに動かなかったけど。。。 tsunotsuno.hate…

ResNetのPyTorch学習済みモデルをfine tuneして使うときのメモ

普段画像データを使って機械学習をすることがあまりないんですが、色々あって最近ちょくちょく触っています。 そんなわけで、画像認識で使うニューラルネットワークの勉強をしていて、最近では画像認識のベースラインとして使用されることもあるResNetについ…

GiNZAを使って係り受け解析をやってみる

結構前にGiNZAを使った固有表現抽出で遊んでました。 www.nogawanogawa.com GiNZAは固有表現抽出の他にも、自然言語処理の様々な機能を備えており、今回はその中の係り受け解析で遊んでみたいと思います。

Naive RAGからModular RAGまで

RAGの評価についてちょこちょこ調べたりしてましたが、今回はRAGの改善方法について調べたいと思います。 正直、今でもいたるところで手法が提案されているので追いかけきれませんが、包括的なレポートで言及されている考え方くらいは調べてみたいと思います…

【写経】TensorFlowを使ったCGANの実装

前回はとりあえずTensorFlowを使ってGANを書くところをやってみました。 tsunotsuno.hatenablog.com 今回もこちらの本を参考にGANの別のモデルをやってみます。 https://www.amazon.co.jp/Learning-Generative-Adversarial-Networks-Ganguly/dp/1788396413 …

タスク固有に追加学習したBERTのEmbeddingをLightGBMに突っ込んで使用する

この前は学習済みのBERTをから取り出したEmbeddigを使ってLightGBMに突っ込んでみるところまでやってみました。 その時は特にタスク個別にBERTを学習させていなかったので、今回はタスク向けに転移学習させたBERTをモデルを使用して、そのEmbeddingをLightGB…

vllmで埋め込みモデルの推論を高速化する

小ネタです。 transformersの埋め込みモデルを使ってembeddingを作りたいことは割といろんなところであるかと思いますが、このembedding作成もそこそこ時間を食ったりします。 可能であれば埋め込みを計算するときも高速化したいので、今回はvllmで高速化し…

gokartを使ってみる

この前はluigiを使ってみてました。 www.nogawanogawa.com この前参加したの勉強会で登壇者のみなさんがgokart激推しだったので、今回はエムスリーさんで開発されているgokartを使ってみたいと思います。 (エムスリーさん主催の勉強会で、登壇者の半分がエ…

GPT-4oをOCRとして使う

OpenAIからChatGPT-4oが発表されましたが、皆さんガンガンつかっていますでしょうか? さて、このChatGPT-4oですが、テキスト以外のデータも使用できるようになっているという特徴があります。 普通にテキストでのやり取りをしつつも画像データを扱えるとい…

LangChainでPrompt Cachingが利用されていることを確認する

この前はプロンプトキャッシュについて調べていました。 www.nogawanogawa.com 実際に各種生成AIサービスを利用する際にはLangChainを利用することが多いと思うので(諸説あり)、今回はLangChainを使いつつちゃんとプロンプトキャッシュが効いていることを…

いまさらLlamaIndexの使い方について勉強する

最近、というかこのGW中はRAGしかやってません。 www.nogawanogawa.com www.nogawanogawa.com www.nogawanogawa.com www.nogawanogawa.com そんなRAGをやっているんですが、実はLlamaIndexについてはちゃんと勉強してなかったことに気がついたので、今更なが…

LlamaIndexでHybrid Searchを試す

前回はLlamaIndexのvector searchでFaissを使ってみました。 今回は、検索部分についてメジャーな改善手法であるHybrid SearchをLlamaIndexで試してみたいと思います。

SudachiPyでユーザー辞書を使う

気がついたら、前回のブログからだいぶ空いてしまいました。 これまで、Sudachiを使ってユーザー辞書を使おうとした場合には、Sudachi(Java)を使用する必要がありました。 それが最近何やらSudachiPyのリリースがあったらしく、SudachiPyでユーザー辞書が…

TabMの使い方のメモ

軽めのネタです。 ちょっと前にCMIコンペに出てまして、そこでテーブルデータに大してNNを適用させる実験をしていました。 www.nogawanogawa.com この実験で色々試しているときに、なにやら別のコンペでTabMというNNの手法が効いたという話を耳にしたのでCMI…

テキスト間の一致度を評価したい

「2つのテキストが一致していること」を判定しようとすると結構苦労することがあります。 "わかりやすく", "微妙に"違ってる、くらいだと良いんですが、現実の問題を考えるとそんなわかりやすい状況のほうが珍しいということに気が付きます。 今回はそんな意…

tensorboardXの導入メモ

最近PyTorchを勉強中なんですが、TensorFlowっぽくstatsを確認したいと思い始めました。 TensorBoard自体は結構便利なので、そのまま使えたら良いなーとか思って探してみたらこんなのありました。 qiita.com なるほどtensorboardXなるものがあるんですね。 g…

基本的な推薦アルゴリズムを書いて眺める

この記事は (1人で)基礎から学ぶ推薦システム Advent Calendar 2022の11日目の記事です。 推薦関係のアルゴリズムは現在でも新しいアルゴリズムがありますが、古典的なアルゴリズムとして協調フィルタリング〜Factorization Machineが挙げられると思います…